跳转至

锁定的评估表面:CRISPRi 扰动效应预测中的迁移失败与采样深度纠缠

文章背景与核心概要

评估机器学习模型如何预测基因对 CRISPRi 扰动的响应,以及这些模型是否能够跨不同的生物学筛选进行泛化,带来了巨大的方法论挑战。数据集往往在终点定义、设计选择和采样深度上存在差异。为了解决这些障碍,本文采用严格锁定的预注册协议(在测试评估和外部标签解盲之前,模型的头部、选择和分析决策均已固定),对冻结的 Geneformer 表示进行了评估。

关键研究发现包括:在虚拟细胞挑战赛(Virtual Cell Challenge, VCC)上,冻结的表征携带了超出随机特征对照的可测量预测信息(\(\Delta R^2 = +0.1645\));在零样本迁移方面,该表征未能成功跨外部筛选进行迁移(Spearman \(\rho = -0.139\)\(-0.267\)),表现低于随机基线;此外,VCC 终点被证明与样本量(细胞计数)高度相关,与聚合幅度信号高度重叠,突出了不受控制的评估很容易掩盖的漏洞。


作者: Mehrdad Shoeibi, Niloofar Yousefi
学科: 机器学习 (cs.LG);人工智能 (cs.AI)
arXiv: 2608.00152v2 [cs.LG]
提交时间: 2026年7月31日;最后修订:2026年8月28日


📌 摘要

评估机器学习模型如何预测基因对 CRISPRi 扰动的响应,以及这些模型是否能够跨不同的生物学筛选进行泛化,带来了巨大的方法论挑战。数据集往往在终点定义、设计选择和采样深度上存在差异。

Evaluating how machine learning models predict gene responses to CRISPRi perturbation—and whether these models generalize across different biological screens—presents significant methodological challenges. Datasets often vary in endpoint definitions, design choices, and sampling depths.

为了解决这些障碍,本文采用严格锁定的预注册协议(在测试评估和外部标签解盲之前,模型的头部、选择和分析决策均已固定),对冻结的 Geneformer 表示进行了评估。

To address these hurdles, this paper evaluates a frozen Geneformer representation using a strictly locked, pre-registered protocol (where model heads, selections, and analysis decisions were fixed prior to test evaluation and external label unblinding).

主要研究发现包括: * 分布内成功: 在虚拟细胞挑战赛(VCC)上,冻结的表征携带了超出随机特征对照的可测量预测信息(\(\Delta R^2 = +0.1645\))。 * 零样本迁移失败: 该表征未能成功跨外部筛选进行迁移(Spearman \(\rho = -0.139\)\(-0.267\)),表现低于随机基线。 * 采样深度纠缠: VCC 终点被证明与样本量(细胞计数)高度相关,与聚合幅度信号高度重叠,突出了不受控制的评估很容易掩盖的漏洞。

Key findings include: * In-Distribution Success: On the Virtual Cell Challenge (VCC), the frozen representation carried measurable predictive information beyond a random-feature control (\(\Delta R^2 = +0.1645\)). * Zero-Shot Transfer Failure: The representation failed to transfer successfully across external screens (Spearman \(\rho = -0.139\) and \(-0.267\)), performing below the random baseline. * Sampling-Depth Entanglement: The VCC endpoint proved to be heavily associated with sample size (cell count), overlapping significantly with aggregate-magnitude signals and highlighting vulnerabilities that uncontrolled evaluations can easily obscure.


📑 元数据与参考信息


🔗 全文与访问链接